Skip to content

Human gloss perception reproduced by tiny neural networks

Morimoto, Akbarinia, Storrs et al. (2026)

DisciplineInterdisciplinary
MethodExperiment
Tagscomputational modelingdata · experimentgloss perceptionmaterial perceptionmethod · machine learningmethod · regressionneural networksvisual perception

Summary

Problem: 光泽感知被视为视觉神经科学中一个典型的挑战性推断问题,因为物体表面反射率与图像外观之间受形状、光照和视角等因素影响而存在高度变异性。以往研究提出了多种基于图像统计的线索模型,但没有任何单一模型能在多样化条件下完全解释人类光泽判断。本文旨在识别能够解释人类光泽判断的、具有生物合理性的图像可计算模型。 Approach: 作者生成了3,888张物体图像(36种形状×36种光照环境×3个视角),通过在线众包实验让295名观察者使用非对称匹配任务对每张图像的光泽度进行评分。随后训练了两类卷积神经网络:一类以人类判断为标签(“人类似网络”),另一类以物理反射率为标签(“物理真值网络”),并系统改变网络深度(从单卷积核到三层网络及ResNet18),比较它们预测人类判断和物理真值的能力。 Finding: 人类光泽判断与物理真值仅中等相关(r=0.52),但观察者间高度一致(中位r=0.86),表明人类存在系统性偏差。仅含一个卷积核的“人类似网络”即可达到人类判断间相关性的75.3%,优于任何物理真值网络;而估计物理反射率需要ResNet18配合额外38万张训练图像才能达到r≈0.9。单核网络涌现的滤波器具有高斯亮斑加对角脊状结构,其色度分布沿日光轨迹排列,能有效检测高光特征。 Significance: 该研究表明人类光泽感知可能依赖简单、通用的视觉计算(如高光检测),而非复杂的逆光学推理,为理解视觉系统如何高效推断材料属性提供了新视角,并展示了“微小”可解释网络在认知科学中的方法论价值。

Theoretical Framework

  • Theoretical tradition: 计算神经科学中的图像可计算模型传统,结合了视觉感知研究与机器学习方法。
  • Prior theories built upon: 基于亮度直方图偏度、亮度梯度、亮度标准差、镜面反射模式指标等光泽感知线索理论;逆光学(inverse optics)框架;深度学习模型拟合人类感知判断的近期研究。
  • Causal mechanism: 人类光泽判断由简单的图像特征检测驱动——具体而言,一个结合高斯亮斑(检测高光)和对角脊状滤波器(检测高光在曲面上的延伸方向)的卷积核即可提取预测光泽感知的关键信息,无需恢复物理反射率参数。
  • Key assumptions: 假设图像中的光泽感知可以通过静态图像判断来有效研究;假设人类判断的系统性偏差反映了感知计算的特征而非随机噪声;假设训练网络拟合人类标签可以揭示人类感知的计算机制。
  • Theoretical move: 本文挑战了逆光学框架(认为人类通过恢复物理参数来感知光泽),应用了数据驱动的深度学习方法,并扩展了传统线索模型——通过让网络自主发现特征而非人工预设线索,超越了实验者想象力的限制。
  • Scope conditions: 结果基于静态图像判断,不直接推广到真实世界动态观看;刺激使用Ward反射模型(表面粗糙度固定为0.05),物体为单一物体置于均匀灰色背景;结论可能受限于所测试的形状、光照和视角范围。

Research Design

本研究为实验计算建模相结合的设计。实验部分采用在线众包实验,使用非对称光泽匹配任务:观察者通过滑动条调整参考物体的镜面反射参数(Pellacini's c),直到参考物体与测试物体看起来光泽度相同。每个图像由至少3名观察者评分,每名观察者重复两次。计算建模部分采用交叉验证的卷积神经网络训练:将3,888张图像按形状或光照分为24组训练/验证集,分别训练以人类标签和物理真值标签为目标的网络。关键自变量为网络架构深度(1层、3层、ResNet18)和训练标签类型(人类判断vs物理真值);因变量为网络预测与人类判断及物理真值的相关系数。单核网络分析中,检验了滤波器结构、色度分布及其对光照和几何操作的敏感性。

Data & Sample

  • 样本量:295名在线观察者(每张图像至少3人评分);3,888张渲染图像(36形状×36光照×3视角)
  • 地区:在线众包(具体国家未明确说明);另有实验室验证实验
  • 招募方式:在线众包平台(具体平台未说明)
  • 数据收集时间:未明确说明(论文2026年发表)
  • 数据来源:作者使用Mitsuba渲染器自行生成图像;使用Ward反射模型,表面粗糙度固定为0.05,随机镜面反射率和体色
  • 额外数据:为训练物理真值网络,额外生成了最多3.8×10⁵张图像(使用新形状和光照)

Analytical Strategy

  • 行为数据分析:计算观察者设置与物理真值之间的Pearson相关;计算观察者内(session 1 vs session 2)和观察者间相关(与其余观察者平均值的相关,以及所有观察者配对间的相关)
  • 模型比较:将各模型在验证集上的预测与人类判断和物理真值分别计算Pearson相关,在二维图中与人类观察者分布进行比较
  • 传统线索模型:计算亮度统计量(均值、中位数、四分位数、最小值、最大值、标准差、偏度、峰度)及镜面反射图像指标(锐度、覆盖率、子带对比度),并用多元线性回归拟合人类响应
  • 网络训练:24折交叉验证(12个形状分割+12个光照分割),每折独立训练;单核网络训练24个独立模型
  • 滤波器分析:将涌现核分解为2D高斯函数和1D定向高斯脊,拟合参数;将核像素转换至Lab*色空间分析色度分布;通过旋转物体90°和降低光照仰角90°测试滤波器对几何和光照的敏感性
  • 统计检验:配对t检验比较模型间差异(如亮度统计回归vs均值亮度模型)

Results & Findings

  • 人类判断与物理真值存在系统性偏差:平均观察者设置与物理真值仅中等相关(r=0.52),中位观察者相关为0.46,无观察者超过0.75。这表明在更广泛的观看条件下,人类经常“误判”镜面反射率。然而,观察者内相关中位数为0.81,观察者间相关中位数为0.86(72张图像)和0.82(12张共享图像),证明偏差是系统性的而非随机噪声。这一发现支持了人类光泽感知并非精确恢复物理参数的假设。
  • 传统线索模型无法解释人类判断:亮度统计模型和镜面反射指标模型在相关图中远离人类分布。虽然多元回归组合亮度统计量显著提高了与人类判断的相关(t(23)=6.18, P<0.001),但组合镜面反射指标无改善(t(23)=0.07, P=0.947)。这表明传统人工设计的线索不足以捕捉人类光泽感知的特征性错误模式。
  • 单核网络即可近似人类判断:仅含一个15×15×3卷积核的网络(卷积后接最大池化和偏置)对人类判断的平均相关达0.65,达到人类观察者间相关(约0.85)的75.3%,且优于所有测试的物理真值网络。三层网络(64核)进一步接近全体观察者平均判断。这直接支持了人类光泽感知依赖简单计算的假设。
  • 物理真值估计需要深层网络:训练于物理标签的三层网络即使增加38万张额外图像,相关仍低于0.70;ResNet18配合额外图像才达到r≈0.9,但其与人类判断的相关低于0.5。这表明人类行为不像“近最优观察者”,不支持逆光学框架的预测。
  • 涌现滤波器具有可解释结构:24个独立训练的单核网络产生了高度一致的滤波器:中央亮斑(常带黄色调)被暗区包围,并伴有棕色-黑色-蓝色的对角脊状结构(约45°或135°)。亮斑适合检测高光的空间强度轮廓,对角脊检测曲面高光的定向延伸。物理真值网络未出现这些脊状结构,表明它们捕捉了人类光泽感知特有的计算特征。
  • 滤波器色度沿日光轨迹分布:核像素在Lab*空间中紧密聚集在CIE日光轨迹上,反映自然场景中直接光照(暖色)与间接光照(冷色)的典型色度关系。当训练图像的光照色度旋转90°后,核的色度分布也旋转约90°,证明滤波器利用了训练环境的色度统计规律。
  • 脊状结构受物体几何而非光照方向驱动:将物体旋转90°后,脊角度从45°变为155°(变化20°);而将光照仰角降低90°后,核模式几乎不变。这表明滤波器主要编码投影表面几何特征,而非绝对光照方向。
  • 滤波器可分解为标准感受野组件:亮斑可由2D高斯函数表示(类似视网膜神经节细胞的感受野),脊状结构可由1D定向高斯表示,表明人类光泽感知可能复用了视觉系统其他任务中的基础计算组件。

Limitations

  • 研究基于静态图像判断,不等同于真实世界动态观看中的光泽感知
  • 刺激使用Ward反射模型且表面粗糙度固定为0.05,未涵盖更广泛的材质参数空间
  • 物体置于均匀灰色背景上,缺乏自然场景的上下文信息
  • 在线众包数据虽经实验室验证,但观察者可能未接受严格控制的实验条件
  • 单核网络的性能上限(75.3%的人类一致性)表明仍有部分人类判断方差未被解释
  • 交叉验证中训练分割部分重叠,24个网络并非完全独立
  • 未测试更广泛的光照色度分布或非日光轨迹光照条件下的滤波器适应性

Key Contributions

  • 首次直接以人类光泽判断数据训练“微小”神经网络,证明单卷积核网络即可复现人类光泽感知的主要特征
  • 系统比较了人类标签与物理真值标签训练的网络,为逆光学框架与启发式计算假说提供了关键判别证据
  • 揭示了人类光泽感知可能依赖的简单计算组件(高斯亮斑+定向脊),与视网膜神经节细胞等早期视觉感受野具有结构相似性
  • 发现滤波器色度沿日光轨迹分布,表明视觉系统利用自然光照的色度统计规律来检测高光
  • 通过几何和光照操控实验,分离了物体几何与光照方向对滤波器结构的影响
  • 展示了“微小”可解释网络作为认知科学方法论工具的潜力,克服了传统线索模型需人工预设特征的限制

Key Claims

"Our findings suggest that relatively shallow CNN architectures with as few as three convolutional layers are sufficient to predict human gloss judgements approximately as well as individual human judgements predict one another, while inferring the physical ground truth requires far more complex computations for equivalent accuracy." (Results, Computational models)

"Indeed, we find that even a single convolutional kernel can predict human perception better than the best of the ground-truth networks." (Results, Computational models)

"This insight indicates that what seems to be a complex visual task, such as judging material properties, may be resolved through a set of simple computations that are also used for other visual tasks." (Results, Computational models)

"The intriguing aspect of this observation is that it suggests that human strategies for estimating material properties such as specular reflectance are unlikely to rely on complex computations that aim to recover physical parameters, as suggested by inverse optics approaches." (Results, Computational models)

"This suggests that the oriented ridges in the kernels truly capture something specific to human gloss perception—rather than being generically useful features for estimating reflectance." (Results, Analysis of single-kernel models)


My Notes